Type: concept
Confidence: 0.90
Created: 2026-04-20
Updated: 2026-04-20
Tags: ai-engineeringevaluation统计非确定性AI工程

pass@k vs pass^k

概述

pass@k 和 pass^k 是处理 Agent 非确定性的两种核心统计指标,分别衡量"至少一次成功"和"所有次均成功"的概率,适用于不同的业务场景。

关键内容

  1. pass@k(至少一次成功)
  2. 公式:P(至少一次成功 | k 次尝试)
  3. k 增大 → 分数升高
  4. 适用于:允许多次重试的场景、代码生成(找到一个有效解就够)
  5. 直观理解:给 Agent 多次机会,只要有一次成功就算通过

  6. pass^k(所有次均成功)

  7. 公式:P(全部成功 | k 次尝试) = p^k(p 为单次成功率)
  8. k 增大 → 分数下降
  9. 适用于:面向用户的 Agent——用户期望每次可靠
  10. 直观理解:Agent 必须每次都成功,不容许失败

  11. 直观数字对比(单次成功率 75%):

  12. pass@1 = 75%
  13. pass^3 = (0.75)³ ≈ 42%
  14. pass@10 → 接近 100%
  15. pass^10 = (0.75)^10 ≈ 6%
  16. 两者在 k=1 时相同,k 增大后说的是完全相反的故事

  17. 选择指南

  18. 代码生成/搜索任务:用 pass@k(找到一个解就够)
  19. 面向用户的对话/操作 Agent:用 pass^k(用户期望每次可靠)
  20. 内部工具/可重试场景:用 pass@k
  21. 生产环境/不可重试场景:用 pass^k

来源

相关